多用户延迟约束调度在许多现实世界应用中都很重要,包括无线通信,实时流和云计算。然而,它提出了一个关键的挑战,因为调度程序需要做出实时决策,以确保没有系统动力学的先前信息,这可能是时间变化且难以估算的。此外,许多实际情况都遭受了部分可观察性问题的影响,例如,由于感应噪声或隐藏的相关性。为了应对这些挑战,我们提出了一种深入的强化学习(DRL)算法,称为Recurrent Softmax延迟深层双重确定性策略梯度($ \ Mathtt {RSD4} $),这是一种基于数据驱动的方法,基于部分观察到的Markov决策过程(POMDP)配方。 $ \ mathtt {rsd4} $分别通过拉格朗日双重和延迟敏感的队列保证资源和延迟约束。它还可以通过复发性神经网络(RNN)启用的记忆机制有效地解决部分可观察性,并引入用户级分解和节点级别的合并以确保可扩展性。对模拟/现实世界数据集的广泛实验表明,$ \ mathtt {rsd4} $对系统动力学和部分可观察到的环境是可靠的,并且在现有的DRL和非基于DRL的方法上实现了卓越的性能。
translated by 谷歌翻译
我们使用线性函数近似研究强化学习,其中过渡概率和奖励函数相对于特征映射$ \ boldsymbol {\ phi}(s,a)$是线性的。具体而言,我们考虑情节不均匀线性马尔可夫决策过程(MDP),并提出了一种新颖的计算有效算法,lsvi-ucb $^+$,它可以实现$ \ widetilde {o} {o}(hd \ sqrt {t})$遗憾的是$ h $是情节长度,$ d $是功能维度,而$ t $是步骤数。 LSVI-UCB $^+$以伯恩斯坦类型的勘探奖金建立了加权山脊回归和上限价值迭代。我们的统计结果是通过新颖的分析工具获得的,包括与椭圆电位的保守主义的新伯恩斯坦自称结合,并对校正项进行了完善的分析。据我们所知,这是线性MDP的第一个最佳最佳算法,直至对数因素,它关闭了$ \ sqrt {hd} $差距,$ \ widetilde {o}(\ sqrt {\ sqrt {\ sqrt { h^3d^3t})$ in \ cit {jin2020provalible}和$ \ omega(hd \ sqrt {t})$的下限用于线性MDPS。
translated by 谷歌翻译
尽管深元学习取得了较高的经验成功,但对过度参数化元学习的理论理解仍然有限。本文研究了广泛使用的元学习方法,模型 - 静态元学习(MAML)的概括,该方法旨在找到快速适应新任务的良好初始化。在混合线性回归模型下,我们分析了在过度参数化方案中用SGD训练的MAML的泛化特性。我们为MAML的多余风险提供上限和下限,这捕获了SGD动力学如何影响这些泛化界限。通过如此敏锐的特征,我们进一步探讨了各种学习参数如何影响过度参数化MAML的概括能力,包括明确识别典型的数据和任务分布,这些数据和任务分布可以通过过度参数化来减少概括性错误,并表征适应性学习率对过量风险和过量风险的影响早期停车时间。我们的理论发现将通过实验进一步验证。
translated by 谷歌翻译
在本文中,我们将重尾多臂匪徒的概念概括为对抗环境,并为重尾多军匪徒(MAB)开发强大的最佳世界世界算法(MAB),其中损失具有$ \ alpha $ -th($ 1 <\ alpha \ le 2 $)由$ \ sigma^\ alpha $界定的矩,而方差可能不存在。具体来说,我们设计了一种算法\ texttt {htinf},当重型尾参数$ \ alpha $和$ \ sigma $是代理人所熟知的,\ texttt {htinf}同时实现了最佳的遗憾,以实现随机和逆境环境的最佳遗憾,不知道实际环境类型A-Priori。当$ \ alpha,\ sigma $是未知的时,\ texttt {htinf}在随机案例中实现了$ \ log t $ t $ style-style实例依赖的遗憾,而在对抗情况下,$ o(t)$ no-regret保证。我们进一步开发了算法\ texttt {adatinf},实现$ \ mathcal o(\ sigma k^{1- \ nicefrac 1 \ alpha} t^{\ nicefrac {1}对抗设置,没有$ \ alpha $和$ \ sigma $的事先知识。该结果与已知的遗憾下降(Bubeck等,2013)相匹配,该遗憾的是,它假设了随机环境,并且$ \ alpha $和$ \ sigma $均为众所周知。 To our knowledge, the proposed \texttt{HTINF} algorithm is the first to enjoy a best-of-both-worlds regret guarantee, and \texttt{AdaTINF} is the first algorithm that can adapt to both $\alpha$ and $\ Sigma $以实现经典重型尾部随机mab设置和我们新颖的对抗性配方的最佳差距遗憾。
translated by 谷歌翻译
保守主义的概念导致了离线强化学习(RL)的重要进展,其中代理从预先收集的数据集中学习。但是,尽可能多的实际方案涉及多个代理之间的交互,解决更实际的多代理设置中的离线RL仍然是一个开放的问题。鉴于最近将Online RL算法转移到多代理设置的成功,可以预期离线RL算法也将直接传输到多代理设置。令人惊讶的是,当基于保守的算法应用于多蛋白酶的算法时,性能显着降低了越来越多的药剂。为了减轻劣化,我们确定了价值函数景观可以是非凹形的关键问题,并且策略梯度改进容易出现本地最优。自从任何代理人的次优政策可能导致不协调的全球失败以来,多个代理人会加剧问题。在这种直觉之后,我们提出了一种简单而有效的方法,脱机多代理RL与演员整流(OMAR),通过有效的一阶政策梯度和Zeroth订单优化方法为演员更好地解决这一关键挑战优化保守值函数。尽管简单,奥马尔显着优于强大的基线,在多售后连续控制基准测试中具有最先进的性能。
translated by 谷歌翻译
在本文中,我们开发了一种新的虚拟队列在线在线凸优化(OCO)问题,具有长期和时变的约束,并对动态遗憾和约束违规进行性能分析。我们设计了一种新的Dual变量的新更新规则以及将时间变化约束函数的新方法集成到双变量中。据我们所知,我们的算法是第一个免费算法,可以同时实现Sublinear动态遗憾和约束违规。我们所提出的算法还优于最先进的结果,例如,在许多方面,例如,我们的算法不需要替换条件。同时,对于一组实际和广泛研究的约束oco问题,其中连续约束的变化在跨时时间流畅,我们的算法实现了$ O(1)$约束违规。此外,我们将算法和分析扩展到案例时,当时地平线$ T $未知。最后,进行了数值实验以验证我们算法的理论保证,并概述了我们提出的框架的一些应用。
translated by 谷歌翻译
在本文中,我们制定了在内核强盗问题(COPE-KB)中的协作纯探索,它为在有限的通信和一般奖励函数下提供了一种用于多智能组件多任务决策的新型模型,并且适用于许多在线学习任务,例如,推荐系统和网络调度。我们考虑两个COPE-KB,即固定信道(FC)和固定预算(FB)的设置,以及设计两个最佳算法COOPKERNECC(FC)和Coopkerhelfb(FB)。我们的算法配备了创新和高效的核化估计,同时实现了计算和通信效率。建立统计和通信度量标准下的上限和下限以证明我们算法的最优性。理论界限成功地量化了任务相似性对学习加速度的影响,并且只取决于内核特征空间的有效维度。我们的分析技术,包括数据尺寸分解,线性结构化实例转换和(通信)圆形加速感应,是新颖的,适用于其他强盗问题。提供了实证评估以验证我们的理论结果,并展示我们算法的性能优势。
translated by 谷歌翻译
我们研究了在随机代理网络中的多功能加固学习(MARL)。目标是找到最大化(折扣)全球奖励的本地化政策。通常,可扩展性在此设置中是一个挑战,因为全局状态/动作空间的大小可以是代理的数量的指数。在依赖性是静态,固定和局部,例如,在固定的,时不变的底层图形的邻居之间,才知道可扩展算法。在这项工作中,我们提出了一个可扩展的演员评论家框架,适用于依赖关系可以是非本地和随机的设置,并提供有限误差绑定,显示了收敛速度如何取决于网络中的信息速度。另外,作为我们分析的副产物,我们获得了一般随机近似方案的新型有限时间收敛结果,以及具有状态聚合的时间差异学习,其超出了网络系统中的Marl的设置。
translated by 谷歌翻译
This paper focuses on designing efficient models with low parameters and FLOPs for dense predictions. Even though CNN-based lightweight methods have achieved stunning results after years of research, trading-off model accuracy and constrained resources still need further improvements. This work rethinks the essential unity of efficient Inverted Residual Block in MobileNetv2 and effective Transformer in ViT, inductively abstracting a general concept of Meta-Mobile Block, and we argue that the specific instantiation is very important to model performance though sharing the same framework. Motivated by this phenomenon, we deduce a simple yet efficient modern \textbf{I}nverted \textbf{R}esidual \textbf{M}obile \textbf{B}lock (iRMB) for mobile applications, which absorbs CNN-like efficiency to model short-distance dependency and Transformer-like dynamic modeling capability to learn long-distance interactions. Furthermore, we design a ResNet-like 4-phase \textbf{E}fficient \textbf{MO}del (EMO) based only on a series of iRMBs for dense applications. Massive experiments on ImageNet-1K, COCO2017, and ADE20K benchmarks demonstrate the superiority of our EMO over state-of-the-art methods, \eg, our EMO-1M/2M/5M achieve 71.5, 75.1, and 78.4 Top-1 that surpass \textbf{SoTA} CNN-/Transformer-based models, while trading-off the model accuracy and efficiency well.
translated by 谷歌翻译
Supervised Question Answering systems (QA systems) rely on domain-specific human-labeled data for training. Unsupervised QA systems generate their own question-answer training pairs, typically using secondary knowledge sources to achieve this outcome. Our approach (called PIE-QG) uses Open Information Extraction (OpenIE) to generate synthetic training questions from paraphrased passages and uses the question-answer pairs as training data for a language model for a state-of-the-art QA system based on BERT. Triples in the form of <subject, predicate, object> are extracted from each passage, and questions are formed with subjects (or objects) and predicates while objects (or subjects) are considered as answers. Experimenting on five extractive QA datasets demonstrates that our technique achieves on-par performance with existing state-of-the-art QA systems with the benefit of being trained on an order of magnitude fewer documents and without any recourse to external reference data sources.
translated by 谷歌翻译